Appearance
Microlevel structural poverty estimates for southern and eastern Africa
Summary
Problem: 传统的贫困测量依赖于家庭调查数据,但这些数据在空间覆盖上稀疏、更新频率低,且在小区域(如村庄)尺度上缺乏代表性。这限制了对贫困的实时、高分辨率监测,尤其是在数据稀缺的南部和东部非洲地区。本文旨在填补这一空白,探索是否可以利用更易获取的地球观测(EO)数据来估计微观尺度的结构性贫困。
Approach: 本文采用两阶段机器学习建模策略。第一阶段,利用家庭调查中的资产数据构建资产财富指数,并训练随机森林模型(RF-regression)来预测家庭人均消费支出,从而生成“结构性贫困”估计。第二阶段,将这些结构性贫困估计聚合到村庄(EA)级别,并作为训练目标,使用公开可获取的地球观测(EO)数据(如夜间灯光、降雨、植被指数、人口密度等)训练另一个随机森林模型,以实现对无调查数据地区的贫困预测。
Finding: 研究发现,基于EO数据的模型在预测村级贫困方面表现良好,尤其是在使用国家内交叉验证时。然而,模型的预测能力在跨国家外推(leave-one-country-out)时显著下降,表明模型对特定国家的背景特征存在依赖。资产财富指数(如资产_land、asset_TLU等)和EO特征(如夜间灯光、人口密度)是预测贫困的重要变量。
Significance: 该研究为在数据稀缺地区进行高分辨率、低成本的贫困监测提供了一种可行的方法。它证明了EO数据结合机器学习在估计结构性贫困方面的潜力,为政策制定者、发展机构和人道主义组织提供了新的工具,以更及时、更精细地识别贫困地区和弱势群体。
Theoretical Framework
- Theoretical tradition: 该研究属于应用发展经济学与计算社会科学交叉领域,根植于“结构性贫困”的概念,即贫困不仅是收入或消费的暂时性短缺,更是由长期缺乏资产、教育和基础设施等结构性因素所决定的。
- Prior theories built upon: 研究建立在“资产贫困”理论之上,认为家庭资产(如土地、牲畜、耐用品)是衡量长期福利和贫困脆弱性的核心指标。它借鉴了DHS财富指数(Rutstein & Johnson, 2004)和国际财富指数(IWI, Smits & Steendijk, 2015)的构建方法。
- Causal mechanism: 核心机制是“资产-消费”关系:家庭拥有的资产(物质资本、人力资本等)通过生产活动和收入流,决定其消费水平,从而决定其贫困状态。EO数据(如夜间灯光、植被)则作为这些资产和活动的空间代理变量。
- Key assumptions: 模型假设家庭资产与消费之间存在稳定的、可学习的关系;假设EO数据能够有效捕捉与贫困相关的空间特征;假设训练数据(家庭调查)能够代表目标区域的贫困分布。
- Theoretical move: 本文应用并扩展了现有的资产财富指数方法,将其与EO数据和机器学习相结合,从家庭层面推广到村级微观尺度,实现了对传统调查方法的补充和空间外推。
- Scope conditions: 该方法的有效性依赖于训练数据的质量和代表性。研究发现,模型在跨国家外推时性能下降,表明其适用范围可能局限于与训练数据地理和经济社会特征相似的区域。
Research Design
本研究属于观察性、预测性建模研究,采用计算方法。分析单元为家庭(第一阶段)和村庄/枚举区(EA,第二阶段)。关键自变量为家庭资产变量(第一阶段)和EO特征变量(第二阶段)。因变量为家庭人均日消费支出(第一阶段)和村级结构性贫困指标(P0, P1, P2,第二阶段)。资产变量通过LSMS调查数据构建,消费支出通过PPP调整统一为2011年国际美元。EO特征包括夜间灯光、降雨、NDVI、人口密度、地形等。
Data & Sample
- 样本: 来自埃塞俄比亚、马拉维、坦桑尼亚和乌干达四个国家的家庭调查数据。
- 数据来源: 世界银行的生活标准测量研究(LSMS)调查。
- 时间: 未在提供的文本中明确说明,但涉及多个年份。
- 数据规模: 未在提供的文本中明确说明总样本量,但提及乌干达约有一半家庭存在至少一个缺失数据字段,其他三国4%-14%的家庭存在缺失。
- 数据处理: 删除了存在缺失数据的观测,并对极端值进行了99分位数的winsorization处理。部分稀有资产被转换为虚拟变量。
Analytical Strategy
- 第一阶段模型: 使用随机森林回归(RF-regression)模型,以家庭资产变量为输入,预测家庭人均日消费支出(对数形式)。模型超参数(mtry=8, min_n=30, trees=1000)通过网格搜索确定。
- 第二阶段模型: 将第一阶段预测的消费支出聚合到EA级别,计算结构性贫困指标(P0, P1, P2),然后使用EO特征作为输入,训练随机森林回归模型进行预测。
- 验证策略: 采用了多种交叉验证方法,包括国家内交叉验证(country cv)、国家内空间交叉验证(country spatial cv)、池化交叉验证(pooled cv)和留一国家外推(pooled leave-country-out, LOCO)。
- 性能评估: 使用R-squared、RMSE和Spearman's ρ等指标评估模型在测试集上的预测性能。
- 特征重要性: 通过排列重要性(permutation importance)评估各特征对模型预测的贡献。
Results & Findings
- 第一阶段模型表现: 基于资产的模型能够较好地预测家庭消费支出,但预测精度在不同国家间存在差异。特征重要性分析显示,家庭规模(asset_hhsize)、土地资产(asset_land)、牲畜(asset_TLU)和住房质量(asset_floor_S)等是预测消费的关键变量。
- 第二阶段模型表现: 基于EO数据的模型在预测村级贫困方面表现良好,尤其是在国家内交叉验证和池化交叉验证中。例如,对于P0($1.90贫困线),池化交叉验证的平均R-squared约为0.448-0.523,Spearman's ρ约为0.650-0.742。
- 跨国外推性能下降: 关键的、出乎意料的发现是,当使用留一国家外推(LOCO)验证时,模型性能急剧下降,甚至出现负的R-squared(如P0 $1.90的pooled leave-country-out R-squared为-0.512)。这表明模型严重依赖于训练国家的特定特征,缺乏跨国家的泛化能力。
- 贫困线影响: 模型在较高的贫困线($3.20)下表现优于较低的贫困线($1.90),表明对极端贫困的预测更具挑战性。
- EO特征重要性: 在第二阶段模型中,夜间灯光(f_lights)、人口密度(f_pop_density)、建筑密度(f_build_den)和降雨(f_rain)等是预测贫困的重要EO特征。
Limitations
- 数据质量: 家庭调查数据存在缺失和测量误差,可能导致模型估计偏差。
- 跨国外推性差: 模型在留一国家外推时性能显著下降,限制了其在没有调查数据的邻国或更广泛区域的应用。
- 结构性贫困定义: 本文的“结构性贫困”是基于资产和消费的代理指标,可能无法完全捕捉贫困的多维性和动态性。
- EO数据代理性: EO数据是间接代理变量,可能无法完全反映影响贫困的复杂社会经济过程。
- 计算资源: 模型调优和训练需要大量计算资源,可能限制其在资源有限环境下的应用。
Key Contributions
- 提出了一种新颖的两阶段机器学习框架,用于从EO数据生成微观尺度的结构性贫困估计。
- 系统评估了该框架在不同验证策略下的性能,特别是揭示了跨国外推的局限性。
- 提供了详细的资产指数构建和数据处理流程,为后续研究提供了可复制的模板。
- 证明了EO数据在贫困测绘中的潜力,为数据稀缺地区的贫困监测提供了新工具。
- 通过特征重要性分析,识别了预测贫困的关键资产和EO变量,为理解贫困的决定因素提供了实证依据。
Key Claims
"Household surveys suffer from missing data and measurement error, and these data quality issues may vary systematically with the country and specific survey." (Supporting Information Text, Data Supplement) "We do not detect patterns of imbalance across households with or without missing data." (Supporting Information Text, Data Supplement) "Based on the generally small differences in model performance across the hyperparameter grids (see Appendix Figures S1-S9) we anticipate that this would not substantially aid model performance." (Supporting Information Text, Model tuning) "For those interested in replicating this approach but without the computational resources for a similar grid search, we note that performance does not appear to be highly sensitive to the hyperparameters and that solid performance is achieved with software defaults." (Supporting Information Text, Model tuning)